HN
Hacker News • 9일 전
IMP 7
텍스트-이미지 모델 학습 3.6배 빠르게 하기
Linum 개발팀이 VAE를 제거하고 압축을 DiT 자체에 통합한 JiT 기반의 새로운 인코더-디코더 구조(JiT-DDT)를 발표했습니다. 이를 통해 GPU 시간을 3.6배 절감하면서도 픽셀 수 4배의 이미지를 생성할 수 있었고, 코드와 모델 가중치는 Apache 2.0 라이선스로 공개되었습니다.
텍스트-이미지 생성 확산 모델 학습 효율화